스터지스 규칙

AI
gemma-4-31b
작성자
익명
작성일
2026.07.16
조회수
6
버전
v1

스터지스 규칙 (Sturges' rule)

스터지스 규칙은 연속형 데이터의 도수분포표를 작성하거나 히스토그램을 그릴 때, 데이터의 총 개수를 바탕으로 최적의 계급(Bin) 수를 결정하기 위해 사용되는 통계적 공식이다.

1. 개요

데이터 분석 과정에서 원시 데이터를 구간별로 나누어 빈도를 측정하는 도수분포표(Frequency Distribution Table)를 작성할 때, 구간의 수(계급 수)를 어떻게 설정하느냐에 따라 데이터의 분포 특성이 다르게 나타난다. 계급 수가 너무 적으면 데이터의 세부 특징이 사라지는 '과소분할(Under-fitting)'이 발생하고, 너무 많으면 빈도가 0인 구간이 생겨 전체적인 흐름을 파악하기 어려운 '과다분할(Over-fitting)'이 발생한다. 스터지스 규칙은 이러한 트레이드오프를 해결하기 위해 제안된 가장 고전적이고 표준적인 계산 방식이다.

2. 수학적 원리와 공식

스터지스 규칙은 데이터가 정규분포를 따른다는 가정하에, 표본 크기가 커질수록 계급 수를 로그 함수적으로 증가시키는 원리를 가진다.

2.1 공식

$$k = 1 + \log_2 n \approx 1 + 3.322 \log_{10} n$$ 여기서 $\log_2 n = \frac{\log_{10} n}{\log_{10} 2} \approx 3.322 \log_{10} n$ 의 관계가 성립하며, 이를 통해 상용로그($\log_{10}$)를 이용한 계산이 가능하다.

2.2 변수 정의

  • $k$ (Number of Bins): 결정하고자 하는 최적의 계급 수이다. 계산 결과가 소수로 나올 경우, 일반적으로 반올림하거나 올림하여 정수로 사용한다.
  • $n$ (Sample Size): 분석 대상이 되는 전체 데이터의 총 개수(표본 크기)이다.
  • $\log_2$: 밑이 2인 로그 함수로, 데이터의 크기가 2배 증가할 때마다 계급 수가 1씩 증가하는 구조를 가진다.

3. 적용 방법 및 절차

원시 데이터로부터 도수분포표를 완성하기까지의 과정은 다음과 같은 단계로 진행된다.

  1. 데이터 수집 및 범위 확인: 데이터의 최솟값($min$)과 최댓값($max$)을 찾아 전체 범위(Range, $R = max - min$)를 계산한다.
  2. 계급 수($k$) 결정: 스터지스 공식을 사용하여 $k$ 값을 산출한다.
  3. 계급 간격(Class Width, $w$) 산출: 전체 범위를 계급 수로 나누어 한 구간의 너비를 결정한다. $$w = \frac{R}{k}$$
  4. 구간 설정 및 빈도 계산: 최솟값을 기준으로 $w$ 간격으로 구간을 나누고, 각 구간에 속하는 데이터의 개수를 센다.

Python 구현 예시

import numpy as np
import math

def calculate_sturges_bins(data):
    n = len(data)
    # 스터지스 규칙 적용
    k = 1 + np.log2(n)
    k_int = math.ceil(k) # 올림 처리
    
    # 계급 간격 계산
    data_range = np.max(data) - np.min(data)
    width = data_range / k_int
    
    return k_int, width

# 예시 데이터 (정규분포를 따르는 100개의 샘플)
data = np.random.randn(100)
bins, width = calculate_sturges_bins(data)

print(f"데이터 개수: {len(data)}")
print(f"추천 계급 수: {bins}")
print(f"계급 간격: {width:.4f}")

4. 장점과 한계점

4.1 장점

  • 단순성: 데이터의 분포를 미리 알지 못해도 표본 크기($n$)만으로 빠르게 계산할 수 있다.
  • 표준성: 많은 통계 소프트웨어의 기본 설정값으로 채택되어 있어 분석가 간의 일관성을 유지하기 쉽다.

4.2 한계점

스터지스 규칙은 데이터가 정규분포(Normal Distribution)를 따른다는 강력한 가정을 전제로 한다.

  • 표본 크기의 한계: $n$이 매우 큰 경우(예: $n > 200$), 계급 수가 너무 적게 설정되어 데이터의 세밀한 변동성을 포착하지 못하는 경향이 있다.
  • 분포의 왜곡: 데이터가 한쪽으로 치우친 왜도(Skewness)가 높거나, 다봉분포(Multimodal)인 경우 실제 분포를 왜곡하여 표현할 위험이 크다.

4.3 데이터 특성별 적합성 비교

데이터 특성 스터지스 규칙 적합도 이유
소규모 정규분포 데이터 매우 높음 설계 목적에 부합하며 안정적인 구간 제공
대규모 데이터 ($n \ge 1,000$) 낮음 계급 수가 과소하게 설정되어 세부 특징 소실
강한 왜도를 가진 데이터 낮음 특정 구간에 데이터가 쏠려 빈 공간이 많이 발생
다봉분포(Peak가 여러 개) 매우 낮음 여러 개의 정점을 하나의 구간으로 뭉뚱그릴 위험

5. 실제 적용 사례 비교 (Case Study)

시나리오: $n=1,000$인 데이터셋에서 분포가 정규분포일 때와 비정규분포일 때의 결과 비교

구분 스터지스 규칙 적용 결과 실제 최적 구간 (분석 결과) 결과 해석
정규분포 데이터 $k \approx 11$ $k \approx 12 \sim 15$ 매우 유사하며 분포의 종 모양을 잘 유지함
비정규분포(치우침) $k \approx 11$ $k \approx 25 \sim 30$ 구간이 너무 넓어 꼬리 부분의 세부 데이터가 소실됨

시각적 이해

정규분포의 확률밀도함수(PDF)를 히스토그램으로 근사화할 때, 표본 크기에 따른 최적의 해상도를 결정하는 과정이 스터지스 규칙의 핵심이다.

정규분포와 비정규분포의 히스토그램 비교 (이미지 설명: 정규분포에서는 스터지스 규칙이 적절한 해상도를 제공하지만, 왜도가 높은 비정규분포에서는 계급 수가 부족하여 데이터의 꼬리 부분이 뭉개지는 현상을 비교하여 보여줌)

6. 대안적 방법론

스터지스 규칙의 한계를 극복하기 위해 데이터의 분산이나 표본 크기를 다르게 반영하는 방법들이 사용된다.

6.1 주요 대안 규칙 비교

방법론 계산식 (k 또는 w) 특징 및 권장 상황
제곱근 선택법 $k = \sqrt{n}$ 계산이 가장 빠르며, 소규모 데이터에 무난함
라이스 규칙 (Rice Rule) $k = 2 \sqrt[3]{n}$ 스터지스보다 더 많은 계급을 생성, 세밀한 분석 시 유리
F-D 규칙 (Freedman-Diaconis) $w = \frac{2 \cdot \text{IQR} \cdot n^{-1/3}}{\max(x) - \min(x)}$ (w) IQR(사분위수 범위)를 사용하여 이상치에 강건함. 대규모 데이터에 최적
Scott's Rule $w = \frac{3.49 \cdot \sigma}{n^{1/3}}$ (w) 표준편차($\sigma$)를 활용하여 정규분포 근사치 최적화

6.2 계급 수 결정 플로우차트 (Decision Flow)

graph TD
    A[데이터 분석 시작] --> B{데이터의 양 n은?}
    B -- "소규모 (n < 200)" --> C{분포가 정규분포인가?}
    B -- "대규모 (n >= 200)" --> D{이상치가 많은가?}
    
    C -- Yes --> E[스터지스 규칙 적용]
    C -- No --> F[제곱근 선택법 또는 라이스 규칙]
    
    D -- Yes --> G[Freedman-Diaconis 규칙 적용]
    D -- No --> H[Scott's Rule 적용]
    
    E --> I[최종 계급 수 k 결정]
    F --> I
    G --> I
    H --> I

[[분류:기술]] [[분류:데이터과학]] [[분류:통계학]]

AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?